메뉴

#추론 속도

HN
Hacker News • 22일 전
IMP 7

Qwen 3.8 27B, Cerebras에서 초당 1500토큰으로 제공

Cerebras의 공개 API 엔드포인트에서 Qwen 3.8 27B 모델을 초당 약 1500토큰의 속도로 사용할 수 있게 되었습니다. 무료 체험 및 종량제 요금제에서 이용 가능하며, 컨텍스트는 무료 64k/유료 128k입니다. Cerebras는 가지치기(Pruning) 없이 원본 모델을 제공하며, 저장 시에만 선택적 양자화를 사용해 품질을 보존한다고 강조했습니다.

Cerebras Qwen 추론 속도
HN
Hacker News • 37일 전
IMP 8

DiffusionGemma 기술 보고서

Gemma 팀이 기존 자기회귀(AR) 모델을 디퓨전 방식으로 파인튜닝한 실험적 오픈 웨이트 언어 모델 'DiffusionGemma'를 공개했습니다. 이 모델은 256 토큰 블록을 병렬로 반복 정제하여 H100 GPU 한 장에서 초당 약 1,500 토큰을 생성하며, 최첨단 추측 디코딩을 적용한 AR 모델보다도 훨씬 빠릅니다. 원본 AR 모델 학습 토큰 예산의 10% 미만으로 학습되었으며, AR 생성 능력도 유지해 하이브리드 디퓨전-AR 디코딩의 가능성을 보여줍니다.

디퓨전 모델 오픈 웨이트 Gemma
TD
The Decoder • 142일 전
IMP 8

구글, 멀티 토큰 예측으로 Gemma 4 속도 3배 향상

구글이 공개형 AI 모델인 Gemma 4에 '멀티 토큰 예측(MTP)' 초안 생성기를 도입해 텍스트 생성 속도를 최대 3배까지 높였습니다. 이 기술은 메인 모델이 데이터를 불러오며 대기하는 시간 동안 소형 보조 모델이 여러 토큰을 미리 제안하고 메인 모델이 이를 한 번에 검증하는 방식으로 작동합니다. 품질 저하 없이 스마트폰, 로컬 PC, 클라우드 환경 모두에서 빠른 처리가 가능하며, 소스코드는 Apache 2.0 라이선스로 공개되었습니다.

구글 Gemma 4 모델 최적화